iT邦幫忙

2026 iThome 鐵人賽

DAY 3
0
AI Engineering

消除你 Agent 的臭味:從 Prompt Engineering 到 Harness Engineering系列 第 3

Day 3 - AI Agent Demo 完美、上線失控:一張地圖看懂 Harness Engineering(包住模型的工作系統)

  • 分享至 

  • xImage
  •  

https://ithelp.ithome.com.tw/upload/images/20260917/201244620b8ry9qVE6.png

Day 3 - AI Agent Demo 完美、上線失控:一張地圖看懂 Harness Engineering(包住模型的工作系統)

本系列談 AI Agent 的『壞味道』——從調 Prompt 到 Harness 工程化,讓 Agent 上線後不失控。

週三 Demo,週五失控

週三 Demo。讀需求、改程式、測試全綠,三分鐘。主管說上線。

週五。同一份 Prompt,跑三次。

一次對。
一次順手改了登入頁文案。
一次回你「測試通過」,CI 裡根本沒跑。

你往 Prompt 加一行「一定要跑測試」。下週它換個方式漏。

看過這個畫面的,往下讀。

為什麼調 Prompt 救不了

AI Agent 不是一顆模型。

可靠的 AI Agent = Model × Context × Tools × State × Environment × Feedback Loop

這次的重點是:成功一次不叫可靠。同一個任務跑三次,三次都達標才算。

把這兩件事放在一起看,會發現一個尷尬的事實。

上面那三次失敗,沒有一次是「模型不夠聰明」。

  • 第二次改到無關檔案:沒有人告訴它範圍在哪,也沒有東西攔它。
  • 第三次假裝跑過測試:Tool 沒回傳結構化結果,系統也接受它自己說「過了」。

Prompt 是提醒。提醒只能改變模型看見的文字。

它改不了三件事:

  • 模型是機率性的,同一句話下次不一定照做。
  • Agent 會改變世界,改壞了不會自己退回。
  • 錯誤會累積,第一步理解錯,後面每一步都在錯的基礎上跑。

所以你往 Prompt 補的每一條規則,都是在用「希望它這次記得」對抗機率。

補到第三十條,Prompt 變成一份沒人維護的法典。Day 4 會專門講這股味道。

問題在模型外面那一圈。

Harness Engineering 是什麼

白話:包住模型的工作系統。

完整一點:設計並維護那一圈系統,讓模型能拿到對的資訊、只動該動的東西、做完會被驗證、做錯會被攔下、失敗能安全恢復。

如果你的背景是 infra,這句話會很熟:

Harness 之於 Agent,如同 K8s 之於容器。

容器自己不會 restart、不會拿 Secret、不會做 Health Check、不會限制自己吃多少 CPU。K8s 替它做。

模型自己也不會確認測試真的跑過、不會知道十分鐘前訂單已經出貨、不會拒絕一封叫它外傳資料的 Email。Harness 替它做。

這一圈系統分五層:

① Prompt
  ↓
② Context
  ↓
③ Tools
  ↓
④ Eval
  ↓
⑤ Guardrail

① Prompt:這次任務要做什麼、怎樣算做對
② Context:它看得到什麼、相信哪一份、什麼時候讀
③ Tools:它能動什麼、環境長怎樣、回傳長怎樣
④ Eval:誰來判斷做對了、做完了,而且不是它自己說
⑤ Guardrail:哪些動作要攔、狀態怎麼保、失敗怎麼恢復

核心概念:Harness 的五層 Prompt、Context、Tools、Eval、Guardrail

對照 Day 1 的六個因素:Context 對 ②;Tools 與 Environment 對 ③;Feedback Loop 對 ④;State、權限與恢復都收在 ⑤。Model 被這五層包在中間。

一個實用的順序:找根因由下往上,改東西由上往下最便宜,但也最不持久。

Agent 沒跑測試,先問 ⑤ 有沒有 Completion Gate、④ 有沒有獨立驗證、③ 的 Tool 回傳有沒有帶證據。這三層都沒有,才回頭看 ①。

多數人反過來。所以 Prompt 越寫越長。

短場景對照:Agent 沒跑測試,補 Prompt 與補 Harness 兩種反應

壞味道地圖

接下來幾篇,每篇會處理 AI Agent 的壞味道,把實務中最常踩的 30 個坑拆成五大類。

每一篇都直接給出一個可以馬上套用的 Pattern,從現象、為什麼臭到怎麼修,馬上就能動手重構。

① 看不見:失敗發生了,卻沒人看得到、重現不了、量不出來。

  • 從歸咎模型、迷信單次成功,到建立穩固的觀測機制

② 看錯了:它看見太多、太少、互相矛盾或沒有錨點的資訊。

  • 從 Prompt 無限制膨脹、盲目塞 Context,到梳理乾淨的輸入邊界

③ 手不穩:工具、環境與權限沒有邊界。

  • 從單一 Shell 走天下、工具越多越亂,到收斂權限與回傳格式

④ 失憶又空轉:分不清過去與現在、重啟就重來、說完成卻沒完成。

  • 從記憶錯亂、無限重試迴圈,到確保狀態一致與確實驗收

⑤ 拆不好:單兵沒治好就急著拆多 Agent、丟 RAG、進 Legacy。

  • 從盲目追求多 Agent 協同、隨意塞 RAG,到扎實打好單兵與基礎架構

參考資料


上一篇
Day 2 - 成功一次就敢上線?Agent Demo 的成功幻覺
系列文
消除你 Agent 的臭味:從 Prompt Engineering 到 Harness Engineering3
圖片
  熱門推薦
圖片
{{ item.channelVendor }} | {{ item.webinarstarted }} |
{{ formatDate(item.duration) }}
直播中

尚未有邦友留言

立即登入留言